<!DOCTYPE html>
<html class="client-nojs vector-feature-language-in-header-enabled vector-feature-language-in-main-page-header-disabled vector-feature-page-tools-pinned-disabled vector-feature-toc-pinned-clientpref-0 vector-toc-not-available vector-feature-main-menu-pinned-disabled vector-feature-limited-width-clientpref-1 vector-feature-limited-width-content-enabled vector-feature-custom-font-size-clientpref-1 vector-feature-appearance-pinned-clientpref-0 skin-theme-clientpref-day vector-sticky-header-enabled" lang="de" dir="ltr"><head>
<meta charset="UTF-8">
<title>Text Mining</title>
<meta name="viewport" content="width=device-width, initial-scale=1.0">
<link rel="icon" type="image/png" href="./_res_/favicon.png">
<link rel="canonical" href="https://de.wikipedia.org/wiki/Text_Mining"> <link href="./_mw_/ext.cite.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.math.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.wikimediamessages.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.icons.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.search.codex.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.styles.css" rel="stylesheet" type="text/css">
<meta name="ResourceLoaderDynamicStyles" content="">
<link href="./_mw_/ext.gadget.citeRef.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.defaultPlainlinks.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonHide.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonLayout.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonStyle.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiDarkmode.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiResponsive.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.specialSearch.css" rel="stylesheet" type="text/css">
<link rel="stylesheet" type="text/css" href="./_mw_/site.styles.css">
<link rel="stylesheet" type="text/css" href="./_mw_/noscript.css">
<link rel="stylesheet" type="text/css" href="./_res_/footer.css">
<link rel="stylesheet" type="text/css" href="./_res_/vector-2022.css">
</head>
<body class="skin--responsive skin-vector skin-vector-search-vue mediawiki ltr sitedir-ltr mw-hide-empty-elt ns-0 ns-subject page-Text_Mining rootpage-Text_Mining skin-vector-2022 action-view">
<div class="mw-page-container">
<div class="mw-page-container-inner">
<div class="mw-content-container">
<main id="content" class="mw-body">
<header class="mw-body-header vector-page-titlebar">
<h1 id="firstHeading" class="firstHeading mw-first-heading"><span class="mw-page-title-main">Text Mining</span></h1>
</header>
<a id="top"></a>
<div id="bodyContent" class="vector-body ve-init-mw-desktopArticleTarget-targetContainer" aria-labelledby="firstHeading" data-mw-ve-target-container="">
<div id="contentSub">
<div id="mw-content-subtitle"></div>
</div>
<div id="mw-content-text" class="mw-body-content mw-content-ltr" lang="de" dir="ltr"><div class="mw-content-ltr mw-parser-output" lang="de" dir="ltr"><p><b>Text Mining</b>, seltener auch <b>Textmining</b>, <b>Text Data Mining</b> oder <b>Textual Data Mining</b>, ist ein Bündel von <a href="Algorithmus" title="Algorithmus">Algorithmus</a>-basierten Analyseverfahren zur Entdeckung von Bedeutungsstrukturen aus un- oder schwachstrukturierten Textdaten. Mit <a href="Sprachstatistik" title="Sprachstatistik">statistischen</a> und <a href="Quantitative_Linguistik" title="Quantitative Linguistik">linguistischen</a> Mitteln erschließt Text-Mining-<a href="Software" title="Software">Software</a> aus Texten Strukturen, die die Benutzer in die Lage versetzen sollen, Kerninformationen der verarbeiteten Texte schnell zu erkennen. Im Optimalfall liefern Text-Mining-Systeme Informationen, von denen die Benutzer zuvor nicht wissen, ob und dass sie in den verarbeiteten Texten enthalten sind. Bei zielgerichteter Anwendung sind Werkzeuge des Text Mining außerdem in der Lage, <a href="Hypothese" title="Hypothese">Hypothesen</a> zu generieren, diese zu überprüfen und schrittweise zu verfeinern.
</p>
<div class="mw-heading mw-heading2"><h2 id="Konzept">Konzept</h2></div>
<p>Das 1995 von Ronen Feldman und Ido Dagan als <i>Knowledge Discovery from Text (KDT)</i><sup id="cite_ref-1" class="reference"><a href="#cite_note-1"><span class="cite-bracket">[</span>1<span class="cite-bracket">]</span></a></sup> in die Forschungsterminologie eingeführte Text Mining<sup id="cite_ref-:0_2-0" class="reference"><a href="#cite_note-:0-2"><span class="cite-bracket">[</span>2<span class="cite-bracket">]</span></a></sup> ist kein klar definierter Begriff. In Analogie zu <a href="Data-Mining" title="Data-Mining">Data-Mining</a> in der <a href="Knowledge_Discovery_in_Databases" title="Knowledge Discovery in Databases">Knowledge Discovery in Databases</a> (<i>KDD</i>) ist Text Mining ein weitgehend automatisierter Prozess der Wissensentdeckung in textuellen Daten, der eine effektive und effiziente Nutzung verfügbarer Textarchive ermöglichen soll.<sup id="cite_ref-:2_3-0" class="reference"><a href="#cite_note-:2-3"><span class="cite-bracket">[</span>3<span class="cite-bracket">]</span></a></sup> Umfassender kann Text Mining als Prozess der Zusammenstellung und Organisation, der formalen Strukturierung und algorithmischen Analyse großer Dokumentsammlungen zur bedarfsgerechten Extraktion von Informationen und der Entdeckung versteckter inhaltlicher Beziehungen zwischen Texten und Textfragmenten gesehen werden.
</p>
<div class="mw-heading mw-heading3"><h3 id="Typologien">Typologien</h3></div>
<p>Die unterschiedlichen Auffassungen von Text Mining können mittels verschiedener Typologien geordnet werden. Dabei werden Arten des <a href="Information_Retrieval" title="Information Retrieval">Information Retrieval</a> (<i>IR</i>),<sup id="cite_ref-:2_3-1" class="reference"><a href="#cite_note-:2-3"><span class="cite-bracket">[</span>3<span class="cite-bracket">]</span></a></sup><sup id="cite_ref-:1_4-0" class="reference"><a href="#cite_note-:1-4"><span class="cite-bracket">[</span>4<span class="cite-bracket">]</span></a></sup> des Dokumenten-Clustering, des Text Data-Mining und des KDD<sup id="cite_ref-:3_5-0" class="reference"><a href="#cite_note-:3-5"><span class="cite-bracket">[</span>5<span class="cite-bracket">]</span></a></sup><sup id="cite_ref-:0_2-1" class="reference"><a href="#cite_note-:0-2"><span class="cite-bracket">[</span>2<span class="cite-bracket">]</span></a></sup> immer wieder als Unterformen des Text Mining genannt.
</p><p>Beim <i>IR</i> ist dabei bekannt, dass die Textdaten bestimmte Fakten enthalten, die mittels geeigneter Suchanfragen gefunden werden sollen. In der <i>Data-Mining-Perspektive</i> wird Text Mining als „Data-Mining auf textuellen Daten“ verstanden, zur Exploration von (interpretationsbedürftigen) Daten aus Texten. Die weitestgehende Art des Text Mining ist das eigentliche <i>KDT</i>, bei der neue, zuvor unbekannte Informationen aus den Texten extrahiert werden sollen.<sup id="cite_ref-:3_5-1" class="reference"><a href="#cite_note-:3-5"><span class="cite-bracket">[</span>5<span class="cite-bracket">]</span></a></sup>
</p>
<div class="mw-heading mw-heading3"><h3 id="Verwandte_Verfahren">Verwandte Verfahren</h3></div>
<p>Text Mining ist mit einer Reihe anderer Verfahren verwandt, von denen es wie folgt abgegrenzt werden kann.
</p><p>Am stärksten ähnelt Text Mining dem Data-Mining. Mit diesem teilt es viele Verfahren, nicht jedoch den Gegenstand: Während Data-Mining zumeist auf stark strukturierte Daten angewandt wird, befasst sich Text Mining mit wesentlich schwächer strukturierten Textdaten. Beim Text Mining werden deshalb in einem ersten Schritt die <a href="Prim%C3%A4rdaten" title="Primärdaten">Primärdaten</a> stärker strukturiert, um ihre Erschließung mit Verfahren des Data-Mining zu ermöglichen.<sup id="cite_ref-:0_2-2" class="reference"><a href="#cite_note-:0-2"><span class="cite-bracket">[</span>2<span class="cite-bracket">]</span></a></sup> Anders als bei den meisten Aufgaben des Data-Mining sind zudem Mehrfachklassifikationen beim Text Mining meist ausdrücklich erwünscht.<sup id="cite_ref-:4_6-0" class="reference"><a href="#cite_note-:4-6"><span class="cite-bracket">[</span>6<span class="cite-bracket">]</span></a></sup>
</p><p>Des Weiteren greift Text Mining auf Verfahren des <a href="Information_Retrieval" title="Information Retrieval">Information Retrieval</a> zurück, die für die Auffindung derjenigen Textdokumente, die für die Beantwortung einer Suchanfrage relevant sein sollen, konzipiert sind.<sup id="cite_ref-:0_2-3" class="reference"><a href="#cite_note-:0-2"><span class="cite-bracket">[</span>2<span class="cite-bracket">]</span></a></sup> Im Gegensatz zum Data Mining werden also nicht möglicherweise unbekannte Bedeutungsstrukturen im Gesamttextmaterial erschlossen, sondern anhand von bekannten Schlüsselwörtern eine Menge relevant erhoffter Einzeldokumente identifiziert.<sup id="cite_ref-:0_2-4" class="reference"><a href="#cite_note-:0-2"><span class="cite-bracket">[</span>2<span class="cite-bracket">]</span></a></sup>
</p><p>Verfahren der <a href="Informationsextraktion" title="Informationsextraktion">Informationsextraktion</a> zielen darauf ab, aus Texten einzelne Fakten zu extrahieren. Informationsextraktion verwendet oft die gleichen oder ähnliche Verfahrensschritte wie dies im Text Mining getan wird;<sup id="cite_ref-:0_2-5" class="reference"><a href="#cite_note-:0-2"><span class="cite-bracket">[</span>2<span class="cite-bracket">]</span></a></sup> bisweilen wird Informationsextraktion deshalb als Teilgebiet des Text Mining betrachtet.<sup id="cite_ref-7" class="reference"><a href="#cite_note-7"><span class="cite-bracket">[</span>7<span class="cite-bracket">]</span></a></sup> Im Gegensatz zu (vielen anderen Arten des) Text Mining sind hier aber zumindest die Kategorien bekannt, zu denen Informationen gesucht werden – der Benutzer weiß, was er nicht weiß.
</p><p>Verfahren des automatischen Zusammenfassens von Texten, der <a href="Textextrahierung" class="mw-redirect" title="Textextrahierung">Textextrahierung</a>, erzeugen ein Kondensat eines Textes oder einer Textsammlung;<sup id="cite_ref-Handbook.546-570,547_8-0" class="reference"><a href="#cite_note-Handbook.546-570,547-8"><span class="cite-bracket">[</span>8<span class="cite-bracket">]</span></a></sup> dabei wird jedoch, anders als beim Text Mining, nicht über das in den Texten explizit Vorhandene hinausgegangen.
</p><p>Als eine Fortsetzung des Text Mining kann das <a href="Argumentation_Mining" title="Argumentation Mining">Argumentation Mining</a> betrachtet werden. Hierbei ist es das Ziel, Argumentationsstrukturen zu extrahieren.
</p>
<div class="mw-heading mw-heading3"><h3 id="Anwendungsgebiete">Anwendungsgebiete</h3></div>
<div class="mw-heading mw-heading4"><h4 id="Web_Mining">Web Mining</h4></div>
<p><a href="Web_Mining" title="Web Mining">Web Mining</a>, insbesondere <i>Web Content Mining</i>, ist ein wichtiges Anwendungsgebiet für Text Mining.<sup id="cite_ref-:2_3-2" class="reference"><a href="#cite_note-:2-3"><span class="cite-bracket">[</span>3<span class="cite-bracket">]</span></a></sup> Noch relativ neu sind Versuche, Text Mining als Methode der sozialwissenschaftlichen <a href="Inhaltsanalyse" title="Inhaltsanalyse">Inhaltsanalyse</a> zu etablieren, beispielsweise <a href="Sentiment_Detection" title="Sentiment Detection">Sentiment Detection</a> zur automatischen Extraktion von Haltungen gegenüber einem Thema.
</p>
<div class="mw-heading mw-heading4"><h4 id="Beispiel">Beispiel</h4></div>
<p>Die Internetseite <i>Wörter des Tages</i>, ein Projekt der Universität Leipzig, zeigt, was Text-Mining-Verfahren leisten können. Sie zeigt an, welche Wörter im Web aktuell häufig verwendet werden. Die Aktualität eines Begriffs ergibt sich dabei aus seiner aktuellen Häufigkeit, verglichen mit seiner durchschnittlichen Häufigkeit über einen längeren Zeitraum hinweg.<sup id="cite_ref-9" class="reference"><a href="#cite_note-9"><span class="cite-bracket">[</span>9<span class="cite-bracket">]</span></a></sup>
</p>
<div class="mw-heading mw-heading2"><h2 id="Methodik">Methodik</h2></div>
<p>Text Mining geht in mehreren Standardschritten vor: Zunächst wird ein <a href="#Datenmaterial">geeignetes Datenmaterial</a> ausgewählt. In einem zweiten Schritt werden diese <a href="#Datenaufbereitung">Daten so aufbereitet</a>, dass sie im Folgenden mittels verschiedener <a href="#Analyseverfahren">Verfahren analysiert</a> werden können. Schließlich nimmt die <a href="#Ergebnispräsentation">Ergebnispräsentation</a> einen ungewöhnlich wichtigen Teil des Verfahrens ein. Alle Verfahrensschritte werden dabei <a href="#Software">softwareunterstützt</a>.
</p>
<div class="mw-heading mw-heading3"><h3 id="Datenmaterial">Datenmaterial</h3></div>
<p>Text Mining wird auf eine (meist sehr große) Menge von Textdokumenten angewandt, die gewisse Ähnlichkeiten hinsichtlich ihrer Größe, Sprache und Thematik aufweisen.<sup id="cite_ref-feldman_2007_2_10-0" class="reference"><a href="#cite_note-feldman_2007_2-10"><span class="cite-bracket">[</span>10<span class="cite-bracket">]</span></a></sup> In der Praxis stammen diese Daten meist aus umfangreichen Textdatenbanken wie <a href="PubMed" title="PubMed">PubMed</a> oder <a href="LexisNexis" title="LexisNexis">LexisNexis</a>.<sup id="cite_ref-feldman_2007_2_10-1" class="reference"><a href="#cite_note-feldman_2007_2-10"><span class="cite-bracket">[</span>10<span class="cite-bracket">]</span></a></sup> Die analysierten Dokumente sind unstrukturiert in dem Sinn, dass sie keine einheitliche Datenstruktur aufweisen, man spricht deshalb auch von „freiem Format“.<sup id="cite_ref-feldman_2007_2_10-2" class="reference"><a href="#cite_note-feldman_2007_2-10"><span class="cite-bracket">[</span>10<span class="cite-bracket">]</span></a></sup> Trotzdem weisen sie jedoch <a href="Semantik" title="Semantik">semantische</a>, <a href="Syntax" title="Syntax">syntaktische</a>, oft auch <a href="Typographie" class="mw-redirect" title="Typographie">typographische</a> und seltener auch <a href="Markup" class="mw-redirect" title="Markup">markup</a>-spezifische Strukturmerkmale auf, auf die Text-Mining-Techniken zurückgreifen; man spricht deshalb auch von <i>schwachstrukturierten</i> oder <i>halbstrukturierten</i> Textdaten.<sup id="cite_ref-feldman_2007_2_10-3" class="reference"><a href="#cite_note-feldman_2007_2-10"><span class="cite-bracket">[</span>10<span class="cite-bracket">]</span></a></sup> Meist entstammen die zu analysierenden Dokumente aus einem gewissen <a href="Diskursuniversum" title="Diskursuniversum">Diskursuniversum</a> (<i>domain</i>), das mehr (z. B. <a href="Genomanalyse" class="mw-redirect" title="Genomanalyse">Genomanalyse</a>) oder weniger (z. B. <a href="Soziologie" title="Soziologie">Soziologie</a>) stark abgegrenzt sein kann.<sup id="cite_ref-feldman_2007_2_10-4" class="reference"><a href="#cite_note-feldman_2007_2-10"><span class="cite-bracket">[</span>10<span class="cite-bracket">]</span></a></sup>
</p>
<div class="mw-heading mw-heading3"><h3 id="Datenaufbereitung">Datenaufbereitung</h3></div>
<p>Das eigentliche Text Mining setzt eine computerlinguistische Aufbereitung der Dokumente voraus. Diese basiert typischerweise auf den folgenden, nur zum Teil automatisierbaren Schritten.
</p>
<p>Zunächst werden die Dokumente in ein einheitliches Format – heutzutage zumeist <a href="Extensible_Markup_Language" title="Extensible Markup Language">XML</a> – überführt.<sup id="cite_ref-:1_4-1" class="reference"><a href="#cite_note-:1-4"><span class="cite-bracket">[</span>4<span class="cite-bracket">]</span></a></sup>
</p><p>Zur Textrepräsentation werden die Dokumente dann zumeist anhand von <a href="Schriftzeichen" title="Schriftzeichen">Schriftzeichen</a>, <a href="Wort" title="Wort">Wörtern</a>, <a href="Begriff" title="Begriff">Begriffen</a> (<i>terms</i>) und/oder so genannten <i>concepts</i> <a href="Tokenisierung" title="Tokenisierung">tokenisiert</a>.<sup id="cite_ref-feldman_2007_2_10-5" class="reference"><a href="#cite_note-feldman_2007_2-10"><span class="cite-bracket">[</span>10<span class="cite-bracket">]</span></a></sup> Dabei steigt bei vorstehenden Einheiten die Stärke der semantischen Bedeutung, aber gleichzeitig auch die Komplexität ihrer <a href="Operationalisierung" title="Operationalisierung">Operationalisierung</a>, oft werden deshalb Hybridverfahren zur Tokenisierung angewandt.<sup id="cite_ref-feldman_2007_2_10-6" class="reference"><a href="#cite_note-feldman_2007_2-10"><span class="cite-bracket">[</span>10<span class="cite-bracket">]</span></a></sup>
</p><p>In der Folge müssen Worte in den meisten <a href="Sprache" title="Sprache">Sprachen</a> <a href="Lemma_(Lexikographie)" title="Lemma (Lexikographie)">lemmatisiert</a> werden, das heißt, auf ihre <a href="Morphologie_(Sprache)" class="mw-redirect" title="Morphologie (Sprache)">morphologische</a> Grundform reduziert werden, bei <a href="Verb" title="Verb">Verben</a> also zum Beispiel der <a href="Infinitiv" title="Infinitiv">Infinitiv</a>. Dies erfolgt durch <a href="Stemming" title="Stemming">Stemming</a>.<sup id="cite_ref-:1_4-2" class="reference"><a href="#cite_note-:1-4"><span class="cite-bracket">[</span>4<span class="cite-bracket">]</span></a></sup>
</p>
<div class="mw-heading mw-heading4"><h4 id="Wörterbücher"><span id="W.C3.B6rterb.C3.BCcher"></span>Wörterbücher</h4></div>
<p>Zur Lösung einiger Probleme werden <a href="Elektronisches_W%C3%B6rterbuch" title="Elektronisches Wörterbuch">digitale Wörterbücher</a> benötigt. Ein <a href="Stoppwort" title="Stoppwort">Stoppwörterbuch</a> entfernt diejenigen Wörter aus den zu analysierenden Daten, bei denen keine oder kaum Vorhersagekraft erwartet wird, wie dies zum Beispiel oft bei <a href="Artikel_(Wortart)" title="Artikel (Wortart)">Artikeln</a> wie „der“ oder „eine“ der Fall ist.<sup id="cite_ref-:1_4-3" class="reference"><a href="#cite_note-:1-4"><span class="cite-bracket">[</span>4<span class="cite-bracket">]</span></a></sup> Um Stoppwörter zu erkennen, werden oft Listen mit den am häufigsten im Textkorpus vorkommenden Wörter erstellt; diese enthalten zumeist neben Stoppwörtern auch die meisten domainspezifischen Ausdrücke, für die normalerweise ebenfalls Wörterbücher erstellt werden.<sup id="cite_ref-:1_4-4" class="reference"><a href="#cite_note-:1-4"><span class="cite-bracket">[</span>4<span class="cite-bracket">]</span></a></sup> Auch die wichtigen Probleme der <a href="Polysemie" title="Polysemie">Polysemie</a> – die Mehrdeutigkeit von Wörtern – und <a href="Synonymie" class="mw-redirect" title="Synonymie">Synonymie</a> – die Gleichbedeutung verschiedener Worte – werden mittels Wörterbüchern gelöst.<sup id="cite_ref-11" class="reference"><a href="#cite_note-11"><span class="cite-bracket">[</span>11<span class="cite-bracket">]</span></a></sup> (Oft domainspezifische) <a href="Thesaurus" title="Thesaurus">Thesauri</a>, die das Synonymproblem abschwächen, werden dabei zunehmend in großen Corpora automatisch generiert.<sup id="cite_ref-12" class="reference"><a href="#cite_note-12"><span class="cite-bracket">[</span>12<span class="cite-bracket">]</span></a></sup>
</p><p>Je nach Analyseart kann es möglich sein, dass Phrasen und Wörter auch durch <a href="Part-of-speech-Tagging" title="Part-of-speech-Tagging">Part-of-speech-Tagging</a> linguistisch klassifiziert werden, häufig ist dies jedoch für Text Mining nicht notwendig.<sup id="cite_ref-:1_4-5" class="reference"><a href="#cite_note-:1-4"><span class="cite-bracket">[</span>4<span class="cite-bracket">]</span></a></sup>
</p>
<ul><li>Pronomen (er, sie) müssen den vorausgehenden oder folgenden Nominalphrasen (Goethe, die Polizisten), auf die sie verweisen, zugeordnet werden (Anaphernresolution).</li>
<li><a href="Eigenname" title="Eigenname">Eigennamen</a> für Personen, Orte, von Firmen, Staaten usw. müssen erkannt werden, da sie eine andere Rolle für die Konstitution der Textbedeutung haben als generische Substantive.</li>
<li>Mehrdeutigkeit von Wörtern und Phrasen wird dadurch aufgelöst, dass jedem Wort und jeder Phrase genau eine Bedeutung zugeschrieben wird (Bestimmung der Wortbedeutung, Disambiguierung).</li>
<li>Einige Wörter und Satz(teile) können einem Fachgebiet zugeordnet werden (Termextraktion).</li></ul>
<p>Um die Semantik der analysierten Textdaten besser bestimmen zu können, wird meist auch auf themenspezifisches Wissen zurückgegriffen.<sup id="cite_ref-feldman_2007_2_10-7" class="reference"><a href="#cite_note-feldman_2007_2-10"><span class="cite-bracket">[</span>10<span class="cite-bracket">]</span></a></sup>
</p>
<div class="mw-heading mw-heading3"><h3 id="Analyseverfahren">Analyseverfahren</h3></div>
<p>Auf der Grundlage dieser partiell strukturierten Daten können die eigentlichen Text-Mining-Verfahren aufbauen, die vor allem auf der Entdeckung von <a href="Kookkurrenz" title="Kookkurrenz">Kookkurrenzen</a>, idealiter zwischen <i>concepts</i>, basieren.<sup id="cite_ref-feldman_2007_2_10-8" class="reference"><a href="#cite_note-feldman_2007_2-10"><span class="cite-bracket">[</span>10<span class="cite-bracket">]</span></a></sup> Diese Verfahren sollen:
</p>
<ul><li>In Texten implizit vorhandene Informationen explizit machen,</li>
<li>Beziehungen zwischen Informationen, die in verschiedenen Texten repräsentiert sind, sichtbar machen.</li></ul>
<p>Kernoperationen der meisten Verfahren sind dabei die Identifizierung von (<a href="Bedingte_Wahrscheinlichkeit" title="Bedingte Wahrscheinlichkeit">bedingten</a>) <a href="H%C3%A4ufigkeitsverteilung" title="Häufigkeitsverteilung">Verteilungen</a>, häufige <a href="Menge_(Datenstruktur)" title="Menge (Datenstruktur)">Mengen</a> und <a href="Stochastisch_unabh%C3%A4ngige_Ereignisse" title="Stochastisch unabhängige Ereignisse">Abhängigkeiten</a>.<sup id="cite_ref-feldman_2007_2_10-9" class="reference"><a href="#cite_note-feldman_2007_2-10"><span class="cite-bracket">[</span>10<span class="cite-bracket">]</span></a></sup> Eine große Rolle bei der Entwicklung solcher Verfahren spielt <a href="Maschinelles_Lernen" title="Maschinelles Lernen">maschinelles Lernen</a>, sowohl in seiner <a href="%C3%9Cberwachtes_Lernen" title="Überwachtes Lernen">überwachten</a> als auch in seiner <a href="Un%C3%BCberwachtes_Lernen" title="Unüberwachtes Lernen">unüberwachten</a> Variante.
</p>
<div class="mw-heading mw-heading4"><h4 id="Clusterverfahren">Clusterverfahren</h4></div>
<p>Neben den traditionell am weitesten verbreiteten <a href="Clusteranalyse" title="Clusteranalyse">Clusteranalyseverfahren</a> – <span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle k}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>k</mi>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle k}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/c3c9a2c7b599b37105512c5d570edc034056dd40.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.338ex; width:1.211ex; height:2.176ex;" alt="{\displaystyle k}" loading="lazy"></span>-means und hierarchischen Clustern – werden bei Clusterverfahren auch selbstorganisierende Karten verwendet. Außerdem greifen mehr und mehr Verfahren auf <a href="Fuzzylogik" title="Fuzzylogik">Fuzzylogik</a> zurück.
</p>
<div class="mw-heading mw-heading5"><h5 id="k-means_Clusteranalyse">k-means Clusteranalyse</h5></div>
<p>Sehr häufig werden beim Text Mining <a href="K-Means-Algorithmus" title="K-Means-Algorithmus"><span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle k}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>k</mi>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle k}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/c3c9a2c7b599b37105512c5d570edc034056dd40.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.338ex; width:1.211ex; height:2.176ex;" alt="{\displaystyle k}" loading="lazy"></span>-means Cluster</a> gebildet. Der zu diesen Clustern gehörende Algorithmus zielt darauf ab, die Summe der <a href="Euklidische_Distanz" class="mw-redirect" title="Euklidische Distanz">euklidischen Distanzen</a> innerhalb und über alle Cluster zu minimieren. Hauptproblem ist dabei, die Anzahl der zu findenden Cluster zu bestimmen, ein <a href="Parameter_(Mathematik)" title="Parameter (Mathematik)">Parameter</a>, der durch den Analysten mit Hilfe seines Vorwissens festgelegt werden muss. Derartige Algorithmen sind sehr effizient, allerdings kann es vorkommen, dass nur <a href="Extremwert" title="Extremwert">lokale Optima</a> gefunden werden.<sup id="cite_ref-13" class="reference"><a href="#cite_note-13"><span class="cite-bracket">[</span>13<span class="cite-bracket">]</span></a></sup>
</p>
<div class="mw-heading mw-heading5"><h5 id="Hierarchische_Clusteranalyse">Hierarchische Clusteranalyse</h5></div>
<p>Bei der ebenfalls populären <a href="Hierarchische_Clusteranalyse" title="Hierarchische Clusteranalyse">hierarchischen Clusteranalyse</a> werden Dokumente in einem hierarchischen Clusterbaum (<i>siehe Abbildung</i>) ihrer Ähnlichkeit nach gruppiert. Dieses Verfahren ist deutlich rechenaufwändiger als das für <span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle k}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>k</mi>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle k}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/c3c9a2c7b599b37105512c5d570edc034056dd40.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.338ex; width:1.211ex; height:2.176ex;" alt="{\displaystyle k}" loading="lazy"></span>-means Cluster. Theoretisch kann man dabei so vorgehen, dass man die Dokumentenmenge in sukzessiven Schritten teilt oder indem man jedes Dokument zunächst als einen eigenen Cluster auffasst und die ähnlichsten Cluster in der Folge schrittweise aggregiert.<sup id="cite_ref-:0_2-6" class="reference"><a href="#cite_note-:0-2"><span class="cite-bracket">[</span>2<span class="cite-bracket">]</span></a></sup> In der Praxis führt aber meist nur letzteres Vorgehen zu sinnvollen Ergebnissen.<sup id="cite_ref-:0_2-7" class="reference"><a href="#cite_note-:0-2"><span class="cite-bracket">[</span>2<span class="cite-bracket">]</span></a></sup> Neben den <a href="Runtime" class="mw-redirect" title="Runtime">Runtimeproblemen</a> ist eine weitere Schwäche die Tatsache, dass man für gute Ergebnisse bereits Hintergrundwissen über die zu erwartende Clusterstruktur benötigt.<sup id="cite_ref-:0_2-8" class="reference"><a href="#cite_note-:0-2"><span class="cite-bracket">[</span>2<span class="cite-bracket">]</span></a></sup> Wie auch bei allen anderen Methoden des Clustering muss letztendlich der menschliche Analyst entscheiden, ob die gefundenen Cluster Sinnstrukturen widerspiegeln.<sup id="cite_ref-14" class="reference"><a href="#cite_note-14"><span class="cite-bracket">[</span>14<span class="cite-bracket">]</span></a></sup>
</p>
<div class="mw-heading mw-heading5"><h5 id="Selbstorganisierende_Karten">Selbstorganisierende Karten</h5></div>
<p>Der 1982 von <a href="Teuvo_Kohonen" title="Teuvo Kohonen">Teuvo Kohonen</a> erstmal entwickelte Ansatz der <a href="Selbstorganisierende_Karte" title="Selbstorganisierende Karte">selbstorganisierenden Karten</a> ist ein weiteres weit verbreitetes Konzept zur Clusterbildung im Text Mining.<sup id="cite_ref-SOM_195_15-0" class="reference"><a href="#cite_note-SOM_195-15"><span class="cite-bracket">[</span>15<span class="cite-bracket">]</span></a></sup> Dabei werden (in der Regel zweidimensionale) <a href="K%C3%BCnstliches_neuronales_Netz" title="Künstliches neuronales Netz">künstliche neuronale Netze</a> angelegt. Diese verfügen über eine Eingabeebene, in der jedes zu klassifizierende Textdokument als multidimensionaler Vektor repräsentiert ist und dem ein <a href="Neuron" class="mw-redirect" title="Neuron">Neuron</a> als Zentrum zugeteilt wird, und über eine Ausgabeebene, in der die Neuronen gemäß der Reihenfolge des gewählten Distanzmaßes aktiviert werden.<sup id="cite_ref-SOM_195_15-1" class="reference"><a href="#cite_note-SOM_195-15"><span class="cite-bracket">[</span>15<span class="cite-bracket">]</span></a></sup>
</p>
<div class="mw-heading mw-heading5"><h5 id="Fuzzy_Clustering">Fuzzy Clustering</h5></div>
<p>Es werden auch auf <a href="Fuzzylogik" title="Fuzzylogik">Fuzzylogik</a> basierende Clustering-Algorithmen verwendet, da viele – insbesondere <a href="Deixis" title="Deixis">deiktische</a> – Sprachentitäten nur vom menschlichen Leser adäquat decodiert werden können und so eine inhärente Unsicherheit bei der computeralgorithmischen Verarbeitung entsteht.<sup id="cite_ref-:5_16-0" class="reference"><a href="#cite_note-:5-16"><span class="cite-bracket">[</span>16<span class="cite-bracket">]</span></a></sup> Da sie dieser Tatsache Rechnung tragen, bieten <a href="Clusteranalyse#Formen_der_Gruppenbildung_(Gruppenzugehörigkeit)" title="Clusteranalyse">Fuzzy Cluster</a> so in der Regel überdurchschnittlich gute Ergebnisse.<sup id="cite_ref-:5_16-1" class="reference"><a href="#cite_note-:5-16"><span class="cite-bracket">[</span>16<span class="cite-bracket">]</span></a></sup><sup id="cite_ref-:6_17-0" class="reference"><a href="#cite_note-:6-17"><span class="cite-bracket">[</span>17<span class="cite-bracket">]</span></a></sup> Typischerweise wird dabei auf <a href="Fuzzy_C-Means" class="mw-redirect" title="Fuzzy C-Means">Fuzzy C-Means</a> zurückgegriffen.<sup id="cite_ref-:6_17-1" class="reference"><a href="#cite_note-:6-17"><span class="cite-bracket">[</span>17<span class="cite-bracket">]</span></a></sup> Andere Anwendungen dieser Art greifen auf <a href="Koreferenz" title="Koreferenz">Koreferenzcluster</a>-<a href="Graph_(Graphentheorie)" title="Graph (Graphentheorie)">Graphen</a> zurück.<sup id="cite_ref-:5_16-2" class="reference"><a href="#cite_note-:5-16"><span class="cite-bracket">[</span>16<span class="cite-bracket">]</span></a></sup>
</p>
<div class="mw-heading mw-heading4"><h4 id="Vektorenverfahren">Vektorenverfahren</h4></div>
<p>Eine große Zahl von Text-Mining-Verfahren ist <a href="Vektor" title="Vektor">vektorenbasiert</a>. Typischerweise werden dabei die in den untersuchten Dokumenten vorkommenden <i>terms</i> in einer zweidimensionalen <a href="Matrix_(Mathematik)" title="Matrix (Mathematik)">Matrix</a> <span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle A_{td}}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<msub>
<mi>A</mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>t</mi>
<mi>d</mi>
</mrow>
</msub>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle A_{td}}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/447fe3bb14eb94f69f458784b7e22ba8188a31b9.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.671ex; width:3.429ex; height:2.509ex;" alt="{\displaystyle A_{td}}" loading="lazy"></span> repräsentiert, wobei <i>t</i> durch die Anzahl der <i>terms</i> und <i>d</i> durch die Anzahl der Dokumente definiert ist. Der Wert des Elements <span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle a_{ij}}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<msub>
<mi>a</mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>i</mi>
<mi>j</mi>
</mrow>
</msub>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle a_{ij}}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/ebea6cd2813c330c798921a2894b358f7b643917.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -1.005ex; width:2.707ex; height:2.343ex;" alt="{\displaystyle a_{ij}}" loading="lazy"></span> wird dabei durch die Häufigkeit des <i>terms</i> <span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle i}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>i</mi>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle i}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/add78d8608ad86e54951b8c8bd6c8d8416533d20.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.338ex; width:0.802ex; height:2.176ex;" alt="{\displaystyle i}" loading="lazy"></span> im Dokument <span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle j}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>j</mi>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle j}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/2f461e54f5c093e92a55547b9764291390f0b5d0.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.671ex; margin-left: -0.027ex; width:0.985ex; height:2.509ex;" alt="{\displaystyle j}" loading="lazy"></span> bestimmt, oft wird die Häufigkeitszahl dabei <a href="Transformation_(Mathematik)" class="mw-redirect" title="Transformation (Mathematik)">transformiert</a>,<sup id="cite_ref-Handbook.546-570,547_8-1" class="reference"><a href="#cite_note-Handbook.546-570,547-8"><span class="cite-bracket">[</span>8<span class="cite-bracket">]</span></a></sup> meist, indem die in den Matrizen-Spalten stehenden Vektoren normiert werden, in dem sie durch ihren <a href="Vektor#Länge/Betrag_eines_Vektors" title="Vektor">Betrag</a> dividiert werden.<sup id="cite_ref-:4_6-1" class="reference"><a href="#cite_note-:4-6"><span class="cite-bracket">[</span>6<span class="cite-bracket">]</span></a></sup> Der so entstandene hoch-dimensionale <a href="Vektorraum" title="Vektorraum">Vektorraum</a> wird in der Folge auf einen deutlich nieder-dimensionaleren Vektor <a href="Funktion_(Mathematik)" title="Funktion (Mathematik)">abgebildet</a>. Dabei spielt seit 1990 zunehmend die <a href="Latent_Semantic_Analysis" title="Latent Semantic Analysis">Latent Semantic Analysis</a> (<i>LSA</i>) eine bedeutende Rolle, die traditionell auf <a href="Singul%C3%A4rwertzerlegung" title="Singulärwertzerlegung">Singulärwertzerlegung</a> zurückgreift.<sup id="cite_ref-Handbook.546-570,547_8-2" class="reference"><a href="#cite_note-Handbook.546-570,547-8"><span class="cite-bracket">[</span>8<span class="cite-bracket">]</span></a></sup> Probabilistic Latent Semantic Analysis (<i>PLSA</i>) ist dabei ein mehr statistisch formalisierter Ansatz, der auf der <a href="Latent_Class_Analysis" class="mw-redirect" title="Latent Class Analysis">Latent Class Analysis</a> basiert und zur Schätzung der Latenzklassenwahrscheinlichkeiten einen <a href="EM-Algorithmus" title="EM-Algorithmus">EM-Algorithmus</a> verwendet.<sup id="cite_ref-Handbook.546-570,547_8-3" class="reference"><a href="#cite_note-Handbook.546-570,547-8"><span class="cite-bracket">[</span>8<span class="cite-bracket">]</span></a></sup>
</p><p>Algorithmen, die auf LSA aufbauen sind allerdings sehr rechenintensiv: Ein normaler <a href="Desktop-Computer" title="Desktop-Computer">Desktop-Computer</a> des Jahrgangs 2004 kann so kaum mehr als einige hunderttausend Dokumente analysieren.<sup id="cite_ref-berry_2007_184f_18-0" class="reference"><a href="#cite_note-berry_2007_184f-18"><span class="cite-bracket">[</span>18<span class="cite-bracket">]</span></a></sup> Geringfügig schlechtere, aber weniger rechenaufwändige Ergebnisse als LSA erzielen auf <a href="Kovarianzanalyse_(Statistik)" title="Kovarianzanalyse (Statistik)">Kovarianzanalysen</a> basierende Vektorraumverfahren.<sup id="cite_ref-berry_2007_184f_18-1" class="reference"><a href="#cite_note-berry_2007_184f-18"><span class="cite-bracket">[</span>18<span class="cite-bracket">]</span></a></sup>
</p><p>Die Auswertung von Beziehungen zwischen Dokumenten durch solcherartig reduzierte Matrizen ermöglicht es, Dokumente zu ermitteln, die sich auf denselben Sachverhalt beziehen, obwohl ihr Wortlaut verschieden ist. Auswertung von Beziehungen zwischen Termen in dieser Matrix ermöglicht es, assoziative Beziehungen zwischen Termen herzustellen, die oftmals semantischen Beziehungen entsprechen und in einer <a href="Ontologie_(Informatik)" title="Ontologie (Informatik)">Ontologie</a> repräsentiert werden können.
</p>
<div class="mw-heading mw-heading3"><h3 id="Ergebnispräsentation"><span id="Ergebnispr.C3.A4sentation"></span>Ergebnispräsentation</h3></div>
<p>Einen ungewöhnlich wichtigen und komplexen Teil des Text Mining nimmt die Präsentation der Ergebnisse ein.<sup id="cite_ref-feldman_2007_2_10-10" class="reference"><a href="#cite_note-feldman_2007_2-10"><span class="cite-bracket">[</span>10<span class="cite-bracket">]</span></a></sup> Darunter fallen sowohl Werkzeuge zum <a href="Browsing" title="Browsing">Browsing</a> als auch zur <a href="Visualisierung" title="Visualisierung">Visualisierung</a> der Ergebnisse.<sup id="cite_ref-feldman_2007_2_10-11" class="reference"><a href="#cite_note-feldman_2007_2-10"><span class="cite-bracket">[</span>10<span class="cite-bracket">]</span></a></sup> Oft werden die Ergebnisse dabei auf zweidimensionalen Karten präsentiert.
</p>
<div class="mw-heading mw-heading2"><h2 id="Software">Software</h2></div>
<p>Eine Reihe von Anwendungsprogrammen für Text Mining existieren; oft sind diese auf bestimmte <a href="Wissensgebiet" title="Wissensgebiet">Wissensgebiete</a> spezialisiert. In technischer Hinsicht lassen sich <a href="#Reine_Text_Miner">reine Text Miner</a>, <a href="#Erweiterungen_existierender_Softwaresuiten">Erweiterungen existierender Software</a> – zum Beispiel zum Data-Mining oder zur Inhaltsanalyse – und Programme, die nur <a href="#Teilanbieter">Teilschritte oder -bereiche</a> des Text Mining begleiten, unterscheiden.<sup id="cite_ref-19" class="reference"><a href="#cite_note-19"><span class="cite-bracket">[</span>19<span class="cite-bracket">]</span></a></sup>
</p>
<div class="mw-heading mw-heading3"><h3 id="Reine_Text_Miner">Reine Text Miner</h3></div>
<div class="mw-heading mw-heading4"><h4 id="Generische_Anwendungen">Generische Anwendungen</h4></div>
<ul><li>Megaputer TextAnalyst / PolyAnalyst</li>
<li>Leximancer</li>
<li>ClearForest Text Analytics Suite</li>
<li><a href="IBM" title="IBM">IBMs</a> WebFountain (wird nicht mehr weiterentwickelt)</li></ul>
<div class="mw-heading mw-heading4"><h4 id="Domänenspezifische_Anwendungen"><span id="Dom.C3.A4nenspezifische_Anwendungen"></span>Domänenspezifische Anwendungen</h4></div>
<ul><li>GeneWays Das in der <a href="Columbia_University" title="Columbia University">Columbia University</a> entwickelte GeneWays deckt zwar auch alle Verfahrensschritte des Text Mining ab, greift aber anders als die ClearForest vertriebenen Programme wesentlich stärker auf domainspezifisches Wissen zurück.<sup id="cite_ref-feldman_2007_2_10-12" class="reference"><a href="#cite_note-feldman_2007_2-10"><span class="cite-bracket">[</span>10<span class="cite-bracket">]</span></a></sup> Das Programm beschränkt sich dabei thematisch auf die <a href="Genforschung" class="mw-redirect" title="Genforschung">Genforschung</a> und widmet dabei den größten Teil seiner Werkzeuge der Datenaufbereitung und weniger dem eigentlichen Text Mining und der Ergebnispräsentation.<sup id="cite_ref-feldman_2007_2_10-13" class="reference"><a href="#cite_note-feldman_2007_2-10"><span class="cite-bracket">[</span>10<span class="cite-bracket">]</span></a></sup></li>
<li>Patent Researcher</li></ul>
<div class="mw-heading mw-heading3"><h3 id="Erweiterungen_existierender_Softwaresuiten">Erweiterungen existierender Softwaresuiten</h3></div>
<ul><li>Text-Mining-Modul <i>tm</i> für <a href="R_(Programmiersprache)" title="R (Programmiersprache)">R</a></li>
<li>Text Processing Modul für <a href="KNIME" title="KNIME">KNIME</a></li>
<li>Text Analytics Toolbox für <a href="Matlab" title="Matlab">MATLAB</a> bietet Algorithmen und Visualisierungen für die Vorverarbeitung, Analyse und Modellierung von Textdaten.</li>
<li><a href="RapidMiner" title="RapidMiner">RapidMiner</a></li>
<li><a href="Environment_for_DeveLoping_KDD-Applications_Supported_by_Index-Structures" title="Environment for DeveLoping KDD-Applications Supported by Index-Structures">ELKI</a> enthält zahlreiche Clusteranalyseverfahren.</li>
<li>NClassifier</li>
<li>WordStat Das von Provalis Research angebotene Softwaremodul WordStat ist das einzige Programm für Text Mining, welches sowohl mit einer Statistikanwendung – Simstat – als auch mit einer Software zur Computer-Assistierten Qualitativen Datenanalyse – QDA Miner – verbunden ist. Damit eignet das Programm sich insbesondere zur <a href="Triangulation_(Sozialwissenschaften)" title="Triangulation (Sozialwissenschaften)">Triangulation</a> von <a href="Qualitative_Sozialforschung" title="Qualitative Sozialforschung">qualitativen</a> <a href="Sozialwissenschaft" class="mw-redirect" title="Sozialwissenschaft">sozialwissenschaftlichen</a> Methoden mit dem quantitativ orientierten Text Mining. Das Programm bietet eine Reihe von Clusteralgorithmen – hierarchische Cluster und <a href="Multidimensionale_Skalierung" title="Multidimensionale Skalierung">Multidimensionale Skalierung</a> – sowie eine Visualisierung der Clusterergebnisse an.<sup id="cite_ref-Handbook.766-784,778_20-0" class="reference"><a href="#cite_note-Handbook.766-784,778-20"><span class="cite-bracket">[</span>20<span class="cite-bracket">]</span></a></sup></li></ul>
<ul><li><a href="SPSS" title="SPSS">SPSS</a> Clementine enthält <a href="Computerlinguistik" title="Computerlinguistik">computerlinguistische</a> Methoden zur Informationsextrahierung anbietet, zur Wörterbucherstellung geeignet ist, und Lemmatisierungen für verschiedene Sprachen vornimmt.<sup id="cite_ref-Handbook.766-784,778_20-1" class="reference"><a href="#cite_note-Handbook.766-784,778-20"><span class="cite-bracket">[</span>20<span class="cite-bracket">]</span></a></sup></li></ul>
<ul><li>SAS Text Miner Das <a href="SAS_Institute" title="SAS Institute">SAS Institute</a> bietet zum SAS Enterprise Miner das Zusatzprogramm SAS Text Miner an, welches eine Reihe von Textclusteralgorithmen anbietet.<sup id="cite_ref-Handbook.766-784,778_20-2" class="reference"><a href="#cite_note-Handbook.766-784,778-20"><span class="cite-bracket">[</span>20<span class="cite-bracket">]</span></a></sup></li></ul>
<div class="mw-heading mw-heading3"><h3 id="Teilanbieter">Teilanbieter</h3></div>
<ul><li>LingPipe</li></ul>
<div class="mw-heading mw-heading4"><h4 id="Linkanalyse">Linkanalyse</h4></div>
<ul><li>Pajek</li>
<li>UCINET</li>
<li>NetMiner</li></ul>
<div class="mw-heading mw-heading2"><h2 id="Literatur">Literatur</h2></div>
<ul><li>Gerhard Heyer, Uwe Quasthoff, Thomas Wittig: <i>Text Mining: Wissensrohstoff Text – Konzepte, Algorithmen, Ergebnisse.</i> W3L Verlag, Herdecke / Bochum 2006, ISBN 3-937137-30-0.</li>
<li>Alexander Mehler, Christian Wolff: <i>Einleitung: Perspektiven und Positionen des Text Mining.</i> In: <i>Zeitschrift für Computerlinguistik und Sprachtechnologie.</i> Band 20, Heft 1, Regensburg 2005, S. 1–18.</li>
<li>Alexander Mehler: <i>Textmining.</i> In: Lothar Lemnitzer, Henning Lobin (Hrsg.): <i>Texttechnologie. Perspektiven und Anwendungen.</i> Stauffenburg, Tübingen 2004, ISBN 3-86057-287-3, S. 329–352.</li>
<li>Jürgen Franke, Gholamreza Nakhaeizadeh, Ingrid Renz (Hrsg.): <i>Text Mining – Theoretical Aspects and Applications.</i> Physica, Berlin 2003.</li>
<li>Ronen Feldman, James Sanger: <i>The Text Mining Handbook: Advanced Approaches in Analyzing Unstructured Data.</i> Cambridge University Press, 2006, ISBN 0-521-83657-3.</li>
<li>Bastian Buch: <i>Text Mining zur automatischen Wissensextraktion aus unstrukturierten Textdokumenten.</i> VDM, 2008, ISBN 978-3-83649-550-9.</li>
<li><a href="Matthias_Lemke_(Politikwissenschaftler)" title="Matthias Lemke (Politikwissenschaftler)">Matthias Lemke</a>, Gregor Wiedemann (Hrsg.): <i>Text Mining in den Sozialwissenschaften. Grundlagen und Anwendungen zwischen qualitativer und quantitativer Diskursanalyse.</i> Springer VS, Wiesbaden 2016, ISBN 978-3-658-07223-0.</li>
<li>Felicitas Lea Kleinkopf: <i>Text- und Data-Mining: Die Anforderungen digitaler Forschungsmethoden an ein innovations- und wissenschaftsfreundliches Urheberrecht.</i> Baden-Baden 2022, ISBN 978-3-8487-7561-3.</li>
<li><i>Chris Biemann, Gerhard Heyer, Uwe Quasthoff: Wissensrohstoff Text. Eine Einführung in das Text Mining</i>. Springer, Wiesbaden 2022, ISBN 978-3-658-35968-3.</li></ul>
<div class="mw-heading mw-heading2"><h2 id="Weblinks">Weblinks</h2></div>
<ul><li><a rel="nofollow" class="external text" href="http://www.sims.berkeley.edu/~hearst/papers/acl99/acl99-tdm.html">Untangling Text Data Mining</a> von Marti A. Hearst, erschienen in den <i>Proceedings of ACL'99: the 37th Annual Meeting of the Association for Computational Linguistics</i>, University of Maryland, June 20-26, 1999</li>
<li><a rel="nofollow" class="external text" href="http://duepublico.uni-duisburg-essen.de/servlets/DerivateServlet/Derivate-21635/Tagungsband_GSCLSYMP2009_final.pdf">GSCL-Symposium "Sprachtechnologie und eHumanities" 26.02.2009 – 27.02.2009</a>, Tagungsband (PDF; 5,3 MB)</li>
<li><a rel="nofollow" class="external text" href="http://www.nactem.ac.uk/">National Centre for Text Mining (NaCTeM)</a> an der University of Manchester</li></ul>
<div class="mw-heading mw-heading2"><h2 id="Einzelnachweise">Einzelnachweise</h2></div>
<ol class="references">
<li id="cite_note-1"><span class="mw-cite-backlink"><a href="#cite_ref-1">↑</a></span> <span class="reference-text"><span class="cite">Ronen Feldman, Ido Dagan: <a rel="nofollow" class="external text" href="https://web.archive.org/web/20140901191050/http://u.cs.biu.ac.il/~dagan/publications/KnowledgeDiscovery.ps"><i>Knowledge Discovery in Texts.</i></a> <span style="white-space:nowrap;">S. 112–117</span>, archiviert vom <style data-mw-deduplicate="TemplateStyles:r250917974">
/* start https://de.wikipedia.org/ */
.mw-parser-output .dewiki-iconexternal>a{background-position:center right!important;background-repeat:no-repeat!important}body.skin-minerva .mw-parser-output .dewiki-iconexternal>a{background-image:url("./_mw_/OOjs_UI_icon_external-link-ltr-progressive.svg")!important;background-size:10px!important;padding-right:13px!important}body.skin-timeless .mw-parser-output .dewiki-iconexternal>a,body.skin-monobook .mw-parser-output .dewiki-iconexternal>a{background-image:url("./_mw_/MediaWiki_external_link_icon.svg")!important;padding-right:13px!important}body.skin-vector .mw-parser-output .dewiki-iconexternal>a{background-image:url("./_mw_/Link.ernal-small-ltr-progressive.svg")!important;background-size:0.857em!important;padding-right:1em!important}
/* end https://de.wikipedia.org/ */
</style><span class="dewiki-iconexternal"><a class="external text" href="https://redirecter.toolforge.org/?url=http%3A%2F%2Fu.cs.biu.ac.il%2F%7Edagan%2Fpublications%2FKnowledgeDiscovery.ps">Original</a></span> (nicht mehr online verfügbar) am <span style="white-space:nowrap;">1. September 2014</span><span>;</span><span class="Abrufdatum"> abgerufen am 27. Januar 2015</span> (First International Conference on Knowledge Discovery (KDD)).</span> <small class="archiv-bot"><span class="wp_boppel noviewer" aria-hidden="true" role="presentation"><span typeof="mw:File"><span title="i"></span></span></span> <b>Info:</b> Der Archivlink wurde automatisch eingesetzt und noch nicht geprüft. Bitte prüfe Original- und Archivlink gemäß Anleitung und entferne dann diesen Hinweis.</small><span style="display:none"><a rel="nofollow" class="external text" href="http://IABotmemento.invalid/http://u.cs.biu.ac.il/~dagan/publications/KnowledgeDiscovery.ps">@1</a></span><span style="display:none"><a rel="nofollow" class="external text" href="http://u.cs.biu.ac.il/~dagan/publications/KnowledgeDiscovery.ps">@2</a></span><span style="display:none">Vorlage:Webachiv/IABot/u.cs.biu.ac.il</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&rfr_id=info%3Asid%2Fde.wikipedia.org%3AText+Mining&rft.title=Knowledge+Discovery+in+Texts&rft.description=Knowledge+Discovery+in+Texts&rft.identifier=https%3A%2F%2Fweb.archive.org%2Fweb%2F20140901191050%2Fhttp%3A%2F%2Fu.cs.biu.ac.il%2F%7Edagan%2Fpublications%2FKnowledgeDiscovery.ps&rft.creator=Ronen+Feldman%2C+Ido+Dagan&rft.source=http://u.cs.biu.ac.il/~dagan/publications/KnowledgeDiscovery.ps"> </span></span>
</li>
<li id="cite_note-:0-2"><span class="mw-cite-backlink">↑ <sup><a href="#cite_ref-:0_2-0">a</a></sup> <sup><a href="#cite_ref-:0_2-1">b</a></sup> <sup><a href="#cite_ref-:0_2-2">c</a></sup> <sup><a href="#cite_ref-:0_2-3">d</a></sup> <sup><a href="#cite_ref-:0_2-4">e</a></sup> <sup><a href="#cite_ref-:0_2-5">f</a></sup> <sup><a href="#cite_ref-:0_2-6">g</a></sup> <sup><a href="#cite_ref-:0_2-7">h</a></sup> <sup><a href="#cite_ref-:0_2-8">i</a></sup></span> <span class="reference-text">Andreas Hotho, Andreas Nürnberger, Gerhard Paaß: <cite style="font-style:italic">A Brief Survey of Text Mining</cite>. In: <cite style="font-style:italic">Zeitschrift für Computerlinguistik und Sprachtechnologie</cite>. <span style="white-space:nowrap">Band<span style="display:inline-block;width:.2em"> </span>20</span>, <span style="white-space:nowrap">Nr.<span style="display:inline-block;width:.2em"> </span>1</span>, 2005 (<a rel="nofollow" class="external text" href="http://www.kde.cs.uni-kassel.de/hotho/pub/2005/hotho05TextMining.pdf">uni-kassel.de</a> [PDF; abgerufen am 11. November 2011]).<span class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&rfr_id=info:sid/de.wikipedia.org:Text+Mining&rft.atitle=A+Brief+Survey+of+Text+Mining&rft.au=Andreas+Hotho%2C+Andreas+N%C3%BCrnberger%2C+Gerhard+Paa%C3%9F&rft.date=2005&rft.genre=journal&rft.issue=1&rft.jtitle=Zeitschrift+f%C3%BCr+Computerlinguistik+und+Sprachtechnologie&rft.volume=20" style="display:none"> </span></span>
</li>
<li id="cite_note-:2-3"><span class="mw-cite-backlink">↑ <sup><a href="#cite_ref-:2_3-0">a</a></sup> <sup><a href="#cite_ref-:2_3-1">b</a></sup> <sup><a href="#cite_ref-:2_3-2">c</a></sup></span> <span class="reference-text">Alexander Mehler, Christian Wollf: <cite style="font-style:italic">Einleitung: Perspektiven und Positionen des Text Mining</cite>. In: <cite style="font-style:italic">Zeitschrift für Computerlinguistik und Sprachtechnologie</cite>. <span style="white-space:nowrap">Band<span style="display:inline-block;width:.2em"> </span>20</span>, <span style="white-space:nowrap">Nr.<span style="display:inline-block;width:.2em"> </span>1</span>, 2005 (<a rel="nofollow" class="external text" href="https://web.archive.org/web/20150402143908/http://pub.uni-bielefeld.de/luur/download?func=downloadFile&recordOId=1773642&fileOId=2311304">archive.org</a> [PDF; abgerufen am 11. November 2011]).<span class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&rfr_id=info:sid/de.wikipedia.org:Text+Mining&rft.atitle=Einleitung%3A+Perspektiven+und+Positionen+des+Text+Mining&rft.au=Alexander+Mehler%2C+Christian+Wollf&rft.date=2005&rft.genre=journal&rft.issue=1&rft.jtitle=Zeitschrift+f%C3%BCr+Computerlinguistik+und+Sprachtechnologie&rft.volume=20" style="display:none"> </span></span>
</li>
<li id="cite_note-:1-4"><span class="mw-cite-backlink">↑ <sup><a href="#cite_ref-:1_4-0">a</a></sup> <sup><a href="#cite_ref-:1_4-1">b</a></sup> <sup><a href="#cite_ref-:1_4-2">c</a></sup> <sup><a href="#cite_ref-:1_4-3">d</a></sup> <sup><a href="#cite_ref-:1_4-4">e</a></sup> <sup><a href="#cite_ref-:1_4-5">f</a></sup></span> <span class="reference-text">Sholom M Weiss, Nitin Indurkhya, Tong Zhang, Fred J. Damerau: <cite style="font-style:italic">Text Mining: Predictive Methods for Analyzing unstructured Information</cite>. Springer, New York, NY 2005, ISBN 0-387-95433-3.<span class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&rfr_id=info:sid/de.wikipedia.org:Text+Mining&rft.au=Sholom+M+Weiss%2C+Nitin+Indurkhya%2C+Tong+Zhang%2C+...&rft.btitle=Text+Mining%3A+Predictive+Methods+for+Analyzing+unstructured+Information&rft.date=2005&rft.genre=book&rft.isbn=0387954333&rft.place=New+York%2C+NY&rft.pub=Springer" style="display:none"> </span></span>
</li>
<li id="cite_note-:3-5"><span class="mw-cite-backlink">↑ <sup><a href="#cite_ref-:3_5-0">a</a></sup> <sup><a href="#cite_ref-:3_5-1">b</a></sup></span> <span class="reference-text">John Atkinson: <cite style="font-style:italic">Evolving Explanatory Novel Patterns for Semantically-Based Text Mining</cite>. In: Anne Kao, Steve Poteet (Hrsg.): <cite style="font-style:italic">Natural Language Processing and Text Mining</cite>. Springer, London, U.K. 2007, ISBN 978-1-84628-754-1, Evolving Explanatory Novel Patterns for Semantically-Based Text Mining, <span style="white-space:nowrap">S.<span style="display:inline-block;width:.2em"> </span>145–169, hier S. 146</span>.<span class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&rfr_id=info:sid/de.wikipedia.org:Text+Mining&rft.atitle=Evolving+Explanatory+Novel+Patterns+for+Semantically-Based+Text+Mining&rft.au=John+Atkinson&rft.btitle=Natural+Language+Processing+and+Text+Mining&rft.date=2007&rft.genre=book&rft.isbn=9781846287541&rft.pages=145-169%2C+hier+S.+146&rft.place=London%2C+U.K.&rft.pub=Springer" style="display:none"> </span></span>
</li>
<li id="cite_note-:4-6"><span class="mw-cite-backlink">↑ <sup><a href="#cite_ref-:4_6-0">a</a></sup> <sup><a href="#cite_ref-:4_6-1">b</a></sup></span> <span class="reference-text">Max Bramer: <cite style="font-style:italic">Principles of Data Mining</cite>. Springer, London, U.K. 2007, ISBN 978-1-84628-765-7.<span class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&rfr_id=info:sid/de.wikipedia.org:Text+Mining&rft.au=Max+Bramer&rft.btitle=Principles+of+Data+Mining&rft.date=2007&rft.genre=book&rft.isbn=9781846287657&rft.place=London%2C+U.K.&rft.pub=Springer" style="display:none"> </span></span>
</li>
<li id="cite_note-7"><span class="mw-cite-backlink"><a href="#cite_ref-7">↑</a></span> <span class="reference-text">z. B. Fabrizio Sebastiani: <cite style="font-style:italic">Machine learning in automated text categorization</cite>. In: <cite style="font-style:italic">ACM Computing Surveys</cite>. <span style="white-space:nowrap">Band<span style="display:inline-block;width:.2em"> </span>34</span>, <span style="white-space:nowrap">Nr.<span style="display:inline-block;width:.2em"> </span>1</span>, 2002, <span style="white-space:nowrap">S.<span style="display:inline-block;width:.2em"> </span>1–47, hier S. 2</span> (<a rel="nofollow" class="external text" href="http://nmis.isti.cnr.it/sebastiani/Publications/ACMCS02.pdf">cnr.it</a> [PDF]).<span class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&rfr_id=info:sid/de.wikipedia.org:Text+Mining&rft.atitle=Machine+learning+in+automated+text+categorization&rft.au=Fabrizio+Sebastiani&rft.date=2002&rft.genre=journal&rft.issue=1&rft.jtitle=ACM+Computing+Surveys&rft.pages=1-47%2C+hier+S.+2&rft.volume=34" style="display:none"> </span></span>
</li>
<li id="cite_note-Handbook.546-570,547-8"><span class="mw-cite-backlink">↑ <sup><a href="#cite_ref-Handbook.546-570,547_8-0">a</a></sup> <sup><a href="#cite_ref-Handbook.546-570,547_8-1">b</a></sup> <sup><a href="#cite_ref-Handbook.546-570,547_8-2">c</a></sup> <sup><a href="#cite_ref-Handbook.546-570,547_8-3">d</a></sup></span> <span class="reference-text">Anne Kao, Steve Poteet, Jason Wu, William Ferng, Rod Tjoelker, Lesley Quach: <cite style="font-style:italic">Latent Semantic Analysis and Beyond</cite>. In: Min Song, Yi-Fang Brooke Wu (Hrsg.): <cite style="font-style:italic">Handbook of Research on Text and Web Mining Technologies</cite>. Information Science Reference, Hershey, PA 2009, ISBN 978-1-59904-990-8, <span style="white-space:nowrap">S.<span style="display:inline-block;width:.2em"> </span>546–570</span>.<span class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&rfr_id=info:sid/de.wikipedia.org:Text+Mining&rft.atitle=Latent+Semantic+Analysis+and+Beyond&rft.au=Anne+Kao%2C+Steve+Poteet%2C+Jason+Wu%2C+...&rft.btitle=Handbook+of+Research+on+Text+and+Web+Mining+Technologies&rft.date=2009&rft.genre=book&rft.isbn=9781599049908&rft.pages=546-570&rft.place=Hershey%2C+PA&rft.pub=Information+Science+Reference" style="display:none"> </span></span>
</li>
<li id="cite_note-9"><span class="mw-cite-backlink"><a href="#cite_ref-9">↑</a></span> <span class="reference-text"><span class="cite"><a rel="nofollow" class="external text" href="https://wod.corpora.uni-leipzig.de/"><i>WORDS of the DAY.</i></a> In: <i>Universität Leipzig.</i><span class="Abrufdatum"> Abgerufen am 7. Juni 2021</span>.</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&rfr_id=info%3Asid%2Fde.wikipedia.org%3AText+Mining&rft.title=WORDS+of+the+DAY&rft.description=WORDS+of+the+DAY&rft.identifier=https%3A%2F%2Fwod.corpora.uni-leipzig.de%2F"> </span></span>
</li>
<li id="cite_note-feldman_2007_2-10"><span class="mw-cite-backlink">↑ <sup><a href="#cite_ref-feldman_2007_2_10-0">a</a></sup> <sup><a href="#cite_ref-feldman_2007_2_10-1">b</a></sup> <sup><a href="#cite_ref-feldman_2007_2_10-2">c</a></sup> <sup><a href="#cite_ref-feldman_2007_2_10-3">d</a></sup> <sup><a href="#cite_ref-feldman_2007_2_10-4">e</a></sup> <sup><a href="#cite_ref-feldman_2007_2_10-5">f</a></sup> <sup><a href="#cite_ref-feldman_2007_2_10-6">g</a></sup> <sup><a href="#cite_ref-feldman_2007_2_10-7">h</a></sup> <sup><a href="#cite_ref-feldman_2007_2_10-8">i</a></sup> <sup><a href="#cite_ref-feldman_2007_2_10-9">j</a></sup> <sup><a href="#cite_ref-feldman_2007_2_10-10">k</a></sup> <sup><a href="#cite_ref-feldman_2007_2_10-11">l</a></sup> <sup><a href="#cite_ref-feldman_2007_2_10-12">m</a></sup> <sup><a href="#cite_ref-feldman_2007_2_10-13">n</a></sup></span> <span class="reference-text">Ronan Feldman, James Sanger: <cite style="font-style:italic">The Text Mining Handbook: Advanced Approaches in Analyzing Unstructured Data</cite>. Cambridge University Press, New York, NY 2007, ISBN 978-0-511-33507-5.<span class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&rfr_id=info:sid/de.wikipedia.org:Text+Mining&rft.au=Ronan+Feldman%2C+James+Sanger&rft.btitle=The+Text+Mining+Handbook%3A+Advanced+Approaches+in+Analyzing+Unstructured+Data&rft.date=2007&rft.genre=book&rft.isbn=9780511335075&rft.place=New+York%2C+NY&rft.pub=Cambridge+University+Press" style="display:none"> </span></span>
</li>
<li id="cite_note-11"><span class="mw-cite-backlink"><a href="#cite_ref-11">↑</a></span> <span class="reference-text">Scott Deerwester, Susan T. Dumais, George W. Furnas, Thomas K. Landauer: <cite style="font-style:italic">Indexing by latent semantic analysis</cite>. In: <cite style="font-style:italic">Journal of the American Society for Information Science</cite>. <span style="white-space:nowrap">Band<span style="display:inline-block;width:.2em"> </span>41</span>, <span style="white-space:nowrap">Nr.<span style="display:inline-block;width:.2em"> </span>6</span>, 1990, <span style="white-space:nowrap">S.<span style="display:inline-block;width:.2em"> </span>391–407, hier S. 391<span style="display:inline-block;width:.2em"> </span>f</span>., <a href="Digital_Object_Identifier" title="Digital Object Identifier">doi</a>:<span class="uri-handle" style="white-space:nowrap"><a rel="nofollow" class="external text" href="https://doi.org/10.1002/%28SICI%291097-4571%28199009%2941%3A6%3C391%3A%3AAID-ASI1%3E3.0.CO%3B2-9">10.1002/(SICI)1097-4571(199009)41:6<391::AID-ASI1>3.0.CO;2-9</a></span>.<span class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&rfr_id=info:sid/de.wikipedia.org:Text+Mining&rft.atitle=Indexing+by+latent+semantic+analysis&rft.au=Scott+Deerwester%2C+Susan+T.+Dumais%2C+George+W.+Furnas%2C+...&rft.date=1990&rft.doi=10.1002%2F%28SICI%291097-4571%28199009%2941%3A6%3C391%3A%3AAID-ASI1%3E3.0.CO%3B2-9&rft.genre=journal&rft.issue=6&rft.jtitle=Journal+of+the+American+Society+for+Information+Science&rft.pages=391-407%2C+hier+S.+391f&rft.volume=41" style="display:none"> </span></span>
</li>
<li id="cite_note-12"><span class="mw-cite-backlink"><a href="#cite_ref-12">↑</a></span> <span class="reference-text">Pierre Senellart, Vincent D. Blondel: <cite style="font-style:italic">Automatic Discovery of Similar Words</cite>. In: Michael W. Berry, Malu Castellanos (Hrsg.): <cite style="font-style:italic">Survey of Text Mining II: Clustering, Classification and Retrieval</cite>. Springer, London, U.K. 2008, ISBN 978-0-387-95563-6, <span style="white-space:nowrap">S.<span style="display:inline-block;width:.2em"> </span>25–44</span>.<span class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&rfr_id=info:sid/de.wikipedia.org:Text+Mining&rft.atitle=Automatic+Discovery+of+Similar+Words&rft.au=Pierre+Senellart%2C+Vincent+D.+Blondel&rft.btitle=Survey+of+Text+Mining+II%3A+Clustering%2C+Classification+and+Retrieval&rft.date=2008&rft.genre=book&rft.isbn=9780387955636&rft.pages=25-44&rft.place=London%2C+U.K.&rft.pub=Springer" style="display:none"> </span></span>
</li>
<li id="cite_note-13"><span class="mw-cite-backlink"><a href="#cite_ref-13">↑</a></span> <span class="reference-text">Joydeep Ghosh, Alexander Liu: <cite style="font-style:italic"><span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle K}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>K</mi>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle K}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/2b76fce82a62ed5461908f0dc8f037de4e3686b0.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.338ex; width:2.066ex; height:2.176ex;" alt="{\displaystyle K}" loading="lazy"></span>-Means</cite>. In: Xindong Wu, Vipin Kumar (Hrsg.): <cite style="font-style:italic">The Top Ten Algorithms in Data Mining</cite>. CRC Press, New York, NY 2005, ISBN 0-387-95433-3, <span style="white-space:nowrap">S.<span style="display:inline-block;width:.2em"> </span>21–37, hier S. 23<span style="display:inline-block;width:.2em"> </span>f</span>.<span class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&rfr_id=info:sid/de.wikipedia.org:Text+Mining&rft.atitle=-Means&rft.au=Joydeep+Ghosh%2C+Alexander+Liu&rft.btitle=The+Top+Ten+Algorithms+in+Data+Mining&rft.date=2005&rft.genre=book&rft.isbn=0387954333&rft.pages=21-37%2C+hier+S.+23f&rft.place=New+York%2C+NY&rft.pub=CRC+Press" style="display:none"> </span></span>
</li>
<li id="cite_note-14"><span class="mw-cite-backlink"><a href="#cite_ref-14">↑</a></span> <span class="reference-text">Roger Bilisoly: <cite style="font-style:italic">Practical Text Mining with Perl</cite>. John Wiley & Sons, Hoboken, NY 2008, ISBN 978-0-470-17643-6, <span style="white-space:nowrap">S.<span style="display:inline-block;width:.2em"> </span>235</span>.<span class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&rfr_id=info:sid/de.wikipedia.org:Text+Mining&rft.au=Roger+Bilisoly&rft.btitle=Practical+Text+Mining+with+Perl&rft.date=2008&rft.genre=book&rft.isbn=9780470176436&rft.pages=235&rft.place=Hoboken%2C+NY&rft.pub=John+Wiley+%26+Sons" style="display:none"> </span></span>
</li>
<li id="cite_note-SOM_195-15"><span class="mw-cite-backlink">↑ <sup><a href="#cite_ref-SOM_195_15-0">a</a></sup> <sup><a href="#cite_ref-SOM_195_15-1">b</a></sup></span> <span class="reference-text">Abdelmalek Amine, Zakaria Elberrichi, Michel Simonet, Ladjel Bellatreche, Mimoun Malki: <cite style="font-style:italic">SOM-Based Clustering of Textual Documents Using WordNet</cite>. In: Min Song, Yi-fang Brooke Wu (Hrsg.): <cite style="font-style:italic">Handbook of Research on Text and Web Mining Technologies</cite>. Information Science Reference, Hershey, PA 2009, ISBN 978-1-59904-990-8, <span style="white-space:nowrap">S.<span style="display:inline-block;width:.2em"> </span>189–200, hier S. 195</span>.<span class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&rfr_id=info:sid/de.wikipedia.org:Text+Mining&rft.atitle=SOM-Based+Clustering+of+Textual+Documents+Using+WordNet&rft.au=Abdelmalek+Amine%2C+Zakaria+Elberrichi%2C+Michel+Simonet%2C+...&rft.btitle=Handbook+of+Research+on+Text+and+Web+Mining+Technologies&rft.date=2009&rft.genre=book&rft.isbn=9781599049908&rft.pages=189-200%2C+hier+S.+195&rft.place=Hershey%2C+PA&rft.pub=Information+Science+Reference" style="display:none"> </span></span>
</li>
<li id="cite_note-:5-16"><span class="mw-cite-backlink">↑ <sup><a href="#cite_ref-:5_16-0">a</a></sup> <sup><a href="#cite_ref-:5_16-1">b</a></sup> <sup><a href="#cite_ref-:5_16-2">c</a></sup></span> <span class="reference-text">René Witte, Sabine Bergler: <cite style="font-style:italic">Fuzzy Clustering for Topic Analysis and Summarization of Document Collections</cite>. In: <cite style="font-style:italic">Advances in Artificial Intelligence</cite>. <span style="white-space:nowrap">Band<span style="display:inline-block;width:.2em"> </span>4509</span>, 2007, <a href="Digital_Object_Identifier" title="Digital Object Identifier">doi</a>:<span class="uri-handle" style="white-space:nowrap"><a rel="nofollow" class="external text" href="https://doi.org/10.1007/978-3-540-72665-4_41">10.1007/978-3-540-72665-4_41</a></span>.<span class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&rfr_id=info:sid/de.wikipedia.org:Text+Mining&rft.atitle=Fuzzy+Clustering+for+Topic+Analysis+and+Summarization+of+Document+Collections&rft.au=Ren%C3%A9+Witte%2C+Sabine+Bergler&rft.btitle=Advances+in+Artificial+Intelligence&rft.date=2007&rft.doi=10.1007%2F978-3-540-72665-4_41&rft.genre=book&rft.volume=4509" style="display:none"> </span></span>
</li>
<li id="cite_note-:6-17"><span class="mw-cite-backlink">↑ <sup><a href="#cite_ref-:6_17-0">a</a></sup> <sup><a href="#cite_ref-:6_17-1">b</a></sup></span> <span class="reference-text">Hichem Frigui, Olfa Nasraoui: <cite style="font-style:italic">Simultaneous Clustering and Dynamic Keyword Weighting for Text Documents</cite>. In: Michael W. Berry (Hrsg.): <cite style="font-style:italic">Survey of Text Mining: Clustering, Classification and Retrieval</cite>. Springer, New York, NY 2004, ISBN 0-387-95563-1.<span class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&rfr_id=info:sid/de.wikipedia.org:Text+Mining&rft.atitle=Simultaneous+Clustering+and+Dynamic+Keyword+Weighting+for+Text+Documents&rft.au=Hichem+Frigui%2C+Olfa+Nasraoui&rft.btitle=Survey+of+Text+Mining%3A+Clustering%2C+Classification+and+Retrieval&rft.date=2004&rft.genre=book&rft.isbn=0387955631&rft.place=New+York%2C+NY&rft.pub=Springer" style="display:none"> </span><br></span>
</li>
<li id="cite_note-berry_2007_184f-18"><span class="mw-cite-backlink">↑ <sup><a href="#cite_ref-berry_2007_184f_18-0">a</a></sup> <sup><a href="#cite_ref-berry_2007_184f_18-1">b</a></sup></span> <span class="reference-text">Mei Kobayashi, Masaki Aono: <cite style="font-style:italic">Vector Space Models for Search and Cluster Mining</cite>. In: Michael W. Berry (Hrsg.): <cite style="font-style:italic">Survey of Text Mining: Clustering, Classification and Retrieval</cite>. Springer, New York, NY 2004, ISBN 0-387-95563-1, <span style="white-space:nowrap">S.<span style="display:inline-block;width:.2em"> </span>103–122, hier S. 108<span style="display:inline-block;width:.2em"> </span>f</span>.<span class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&rfr_id=info:sid/de.wikipedia.org:Text+Mining&rft.atitle=Vector+Space+Models+for+Search+and+Cluster+Mining&rft.au=Mei+Kobayashi%2C+Masaki+Aono&rft.btitle=Survey+of+Text+Mining%3A+Clustering%2C+Classification+and+Retrieval&rft.date=2004&rft.genre=book&rft.isbn=0387955631&rft.pages=103-122%2C+hier+S.+108f&rft.place=New+York%2C+NY&rft.pub=Springer" style="display:none"> </span></span>
</li>
<li id="cite_note-19"><span class="mw-cite-backlink"><a href="#cite_ref-19">↑</a></span> <span class="reference-text">Alessandro Zanasi: <cite style="font-style:italic">Text Mining Tools</cite>. In: Alessandro Zanasi (Hrsg.): <cite style="font-style:italic">Text Mining and its Applications to Intelligence, CRM and Knowledge Management</cite>. WIT Press, Southampton & Billerica, MA 2005, ISBN 1-84564-131-0, <span style="white-space:nowrap">S.<span style="display:inline-block;width:.2em"> </span>315–327, hier S. 315</span>.<span class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&rfr_id=info:sid/de.wikipedia.org:Text+Mining&rft.atitle=Text+Mining+Tools&rft.au=Alessandro+Zanasi&rft.btitle=Text+Mining+and+its+Applications+to+Intelligence%2C+CRM+and+Knowledge+Management&rft.date=2005&rft.genre=book&rft.isbn=1845641310&rft.pages=315-327%2C+hier+S.+315&rft.place=Southampton+%26+Billerica%2C+MA&rft.pub=WIT+Press" style="display:none"> </span></span>
</li>
<li id="cite_note-Handbook.766-784,778-20"><span class="mw-cite-backlink">↑ <sup><a href="#cite_ref-Handbook.766-784,778_20-0">a</a></sup> <sup><a href="#cite_ref-Handbook.766-784,778_20-1">b</a></sup> <sup><a href="#cite_ref-Handbook.766-784,778_20-2">c</a></sup></span> <span class="reference-text">Richard Segall, Qingyu Zhang: <cite style="font-style:italic">A Survey of Selected Software Technologies for Text Mining</cite>. In: Min Song, Yi-fang Brooke Wu (Hrsg.): <cite style="font-style:italic">Handbook of Research on Text and Web Mining Technologies</cite>. Information Science Reference, Hershey, PA 2009, ISBN 978-1-59904-990-8.<span class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&rfr_id=info:sid/de.wikipedia.org:Text+Mining&rft.atitle=A+Survey+of+Selected+Software+Technologies+for+Text+Mining&rft.au=Richard+Segall%2C+Qingyu+Zhang&rft.btitle=Handbook+of+Research+on+Text+and+Web+Mining+Technologies&rft.date=2009&rft.genre=book&rft.isbn=9781599049908&rft.place=Hershey%2C+PA&rft.pub=Information+Science+Reference" style="display:none"> </span></span>
</li>
</ol></div><!--htdig_noindex--><div><div class="zim-footer">
Dieser Artikel wurde von <a class="external text" title="Zuletzt bearbeitet am 2026-01-05" href="https://de.wikipedia.org/wiki/?title=Text_Mining&oldid=263046387">Wikipedia</a> herausgegeben. Der Text ist unter <a class="external text" href="https://creativecommons.org/licenses/by-sa/4.0/deed.de">Creative Commons Attribution-Share Alike 4.0</a> verfügbar, sofern nicht anders angegeben. Für die Mediendateien können zusätzliche Bedingungen gelten.
</div>
</div><!--/htdig_noindex--></div>
</div>
</main>
</div>
</div>
</div>
<script src="./_webp_/webpHandler.js"></script>
</body></html>